Original Note

二: Training and Inference: Input - Outline

Outline

  1. 一: 数据预处理
  2. A. 第一步:分组(Grouping)
  3. B. 第二步:枚举组合(Enumeration)
  4. C. 第三步:平衡与裁剪(Trimming)
  5. D. 第四步:最终数据集
  6. 二: Training and Inference: Input
  7. 1. 预训练阶段:每一个“词”都是锚点
  8. 2. 下游任务阶段:什么是真正的 Mention?
  9. 3. 关键区别总结
  10. 三: Training process
  11. 第一步:计算全成对相似度矩阵 $S$
  12. 第二步:构建标签掩码 (Label Masks)
  13. 第三步:利用 $S$ 进行在线硬采样
  14. 第四步:计算 MS Loss (公式 2 的具体实现)